1
Sự Chuyển Dịch Mô Hình: Từ Các Mô Hình Chuyên Dụng đến LLM
PolyU COMP5511Lecture 10
00:00

Sự Tiến Hóa của NLP: Từ AI Phân Mảnh đến Mô Hình Nền Tảng

Định Nghĩa

  • AI Phân Mảnh: Một kỷ nguyên được định nghĩa bởi các kiến trúc mạng nơ-ron rời rạc, chuyên biệt được thiết kế cho từng nhiệm vụ riêng lẻ như gán nhãn chuỗi hoặc phân loại.
  • Mô Hình Nền Tảng: Một kiến trúc transformer thống nhất, nguyên khối xử lý mọi bài toán ngôn ngữ như một chuỗi sinh văn bản-từ-văn-bản $x \rightarrow y$.

Các Khái Niệm Cốt Lõi

  • Hợp Nhất Kiến Trúc: Trong quá khứ, NLP đòi hỏi các quy trình xử lý được thiết kế riêng (Bi-LSTM cho NER, CNN cho phân tích cảm xúc). LLM hợp nhất các hệ thống riêng biệt này vào một lõi duy nhất, nơi cùng một bộ trọng số được sử dụng cho mọi nhiệm vụ.
  • Giao Diện Thống Nhất: LLM thay thế các "đầu ra chuyên dụng" (ví dụ: Softmax 3 lớp) bằng một giao diện ngôn ngữ tự nhiên. Đầu vào và đầu ra luôn là chuỗi văn bản, cho phép mô hình diễn giải ý định thay vì định dạng.
  • Chuyển Giao Tri Thức: Các mô hình truyền thống là "trang giấy trắng" cho mỗi nhiệm vụ. LLM ưu tiên Khái Quát Hóa Trước Tiên, trong đó các nhiệm vụ cụ thể chỉ là những ứng dụng đơn giản của một biểu diễn ngôn ngữ nội tại mạnh mẽ đã tồn tại từ trước.

Bối Cảnh Lịch Sử

  • Trước 2018: Việc tách biệt nhiệm vụ đòi hỏi huấn luyện các mô hình riêng biệt với các hàm mất mát khác nhau $\mathcal{L}_{task}$.
  • Kỷ Nguyên Hiện Đại: Mô hình "Văn bản-từ-văn bản" cho phép một mô hình duy nhất (ví dụ: Llama-3) chuyển đổi nhiệm vụ thông qua prompting zero-shot hoặc few-shot.
AI Truyền Thống$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$Kỷ Nguyên Mô Hình Nền TảngPrompt + $x$LLM$f(p, x) \rightarrow y_{str}$Chuỗi $y$
So Sánh Triển Khai Python